沐曦通用 GPU 与 MXMACA® 软件栈
MXMACA‑C500 发布说明
RN‑23009‑020‑F5 2026‑05‑28

声明
版权所有 ©2023‑2026 沐曦集成电路（上海）股份有限公司。保留所有权利。
本文档中呈现的信息属于沐曦集成电路（上海）股份有限公司和/或其附属公司（以下统称为“沐曦股
份” ） ，非经沐曦股份事先书面许可，任何实体或个人均不得获得本文档的副本，且无权以任何方式处理
本文档，包括但不限于使用、复制、修改、合并、出版、发行、销售或传播本文档的部分或全部。
本文档内容仅供参考，不提供任何形式的、明示或暗示的保证，包括但不限于对适销性、适用于任何目
的和/或不侵权的保证。在任何情况下，沐曦股份均不对因本文档引起的、由本文档造成的、或与之相关
的任何索赔、损害或其他责任负责。
沐曦股份保留自行决定随时更改、修改、添加或删除本文档的部分或全部的权利。沐曦股份保留最终解
释权。
沐曦、MetaX 和其他沐曦图标是沐曦股份的商标。本文档中提及的所有其他商标和商品名称均为其各自
所有者的财产。
MXMACA‑C500 发布说明
1 概述
本文档包含了此次发布的 MXMACA 驱动软件包的特性，已知问题和使用限制等。
此 次 发 布 是 MXC500 GPU 的 VBIOS 1.33.5.0 ，Metax‑Driver‑3.7.2.30，MXMACA‑SDK‑3.7.2.0，
MXMACA‑Pytorch‑3.7.2.0，MXMACA‑Iree‑3.7.2.0，MXMACA‑JAX‑3.7.2.0，MXMACA‑TileLang‑
3.7.2.0，MXMACA‑SDK‑Python‑3.7.2.0 版本交付，适用于曦云 ® C500、C500X、C550、C550‑PL、
C588，曦思 ® N260 和曦索 ® X206。
下表列出了系统测试覆盖率和通过率。
表 1.1 系统测试覆盖率及通过率
系统 测试覆盖率/通过率
Metax‑Driver‑3.7.2.30 Sanity regression with release quality
MXMACA‑SDK‑3.7.2.0 Sanity regression with release quality
MXMACA‑Pytorch‑3.7.2.0 Sanity regression with release quality
MXMACA‑Iree‑3.7.2.0 Sanity regression with release quality
MXMACA‑JAX‑3.7.2.0 Sanity regression with release quality
MXMACA‑TileLang‑3.7.2.0 Sanity regression with release quality
MXMACA‑SDK‑Python‑3.7.2.0 Sanity regression with release quality
1.1 交付内容
此次发布的软件包包含以下内容：
• Metax‑Driver‑3.7.2.30 Driver 软件栈
• MXMACA‑SDK‑3.7.2.0 SDK 软件栈
• MXMACA‑Pytorch‑3.7.2.0 Pytorch 软件栈
• MXMACA‑Iree‑3.7.2.0 Iree 软件栈
• MXMACA‑JAX‑3.7.2.0 JAX 软件栈
• MXMACA‑TileLang‑3.7.2.0 TileLang 软件栈
• MXMACA‑SDK‑Python‑3.7.2.0 SDK‑Python 软件栈
1 概述 沐曦股份专有信息 RN‑23009‑020‑F5 | 1
MXMACA‑C500 发布说明
2 新增特性及变更
本章列出历次发布的新增特性及变更。
2.1 Metax‑Driver‑3.7.2.30，MXMACA‑SDK‑3.7.2.0，MXMACA‑
Pytorch‑3.7.2.0，MXMACA‑Iree‑3.7.2.0，MXMACA‑JAX‑
3.7.2.0，MXMACA‑TileLang‑3.7.2.0，MXMACA‑SDK‑Python‑
3.7.2.0
模块 特性说明
Metax Driver KMD 解决从 ioctl 接口下发 MetaXLink Training 命令失败的问题
2.2 Metax‑Driver‑3.7.1.1，MXMACA‑SDK‑3.7.1.5，MXMACA‑
Pytorch‑3.7.1.3，MXMACA‑Iree‑3.7.1.0，MXMACA‑JAX‑
3.7.1.0，MXMACA‑TileLang‑3.7.1.1，MXMACA‑SDK‑Python‑
3.7.1.0
模块 特性说明
MXMACA SDK ACL mcTlassEx w8a8 fused moe 算子优化
mcTlassEx w4a16 fused moe 算子优化
mcTlassEx bf16 fused moe 算子优化
mcTlassEx w8a8 scaled gemm 算子优化
flashInfer ragged prefill 和 paged prefill 性能优化
flashAttn 支持和优化 headdim192+128 的 sink attention
2 新增特性及变更 沐曦股份专有信息 RN‑23009‑020‑F5 | 2
MXMACA‑C500 发布说明
2.3 Metax‑Driver‑3.7.0.23，MXMACA‑SDK‑3.7.0.38，MXMACA‑
Pytorch‑3.7.0.7，MXMACA‑Iree‑3.7.0.1，MXMACA‑JAX‑
3.7.0.2，MXMACA‑TileLang‑3.7.0.3，MXMACA‑SDK‑Python‑
3.7.0.4
模块 特性说明
Metax Driver KMD 板卡状态异常时，减少下发 mailbox 的通讯
优化 debugfs 的中断统计功能
VT 虚拟化时多个 VF 支持 vram 均分
虚拟化支持单卡粒度的 VF 切分能力
Firmware FW 支持通过预加载 MXMACA Graph 内所有核函数指令与参数，
提升 Graph 端到端性能
MXMACA SDK UMD maca‑python API 首版发布，支持 maca‑binding python API
mcpti 完善 callback cbid API，支持 tensorflow profiling 使用
MXMACA Graph 默认进行冗余边优化，提升 Graph 整体性能
MACA_LAUNCH_MODE=2（非默认值） 性能优化， Kernel 参数 Host
写入保持 Uncache，但 Device 读取改为 Cache
支持 mcModuleLaunchBatchKernel 接口，并支持其作为 MX‑
MACA Graph 的一个节点类型
进程启动时自动检测 GPU NUMA 配置，并以表格形式呈现 CPU、
内存和动态库的 NUMA 亲和性优化提示，辅助性能调优
mcMemset 小 shape 性能提升， 4 字节 mcMemset 从 10us 优化
到 5us 以内
UMD 支持通过预加载 Graph 内所有核函数指令与参数，提升
Graph 端到端性能
trap kernel args dump 功能增强
Compiler mcXLA 支持 tensorflow 框架 v2.13.1 版本
mcTileLang 完成 C500 首次 release 发布，为开发者提供 wheel
包
mcMPP 库向 MXMACA SDK 合入发布
PK FMA 指令自动生成优化
CommLib MXShmem 支持集合通信类、内存操作类等接口功能
OMPI 开启 OpenIB 功能，支持脱离 UCX 的网络通信
DeepEP 支持 hidden size 2816、3328 等规格
ACL mcTlassEx 新增 int8 w4a8 masked group gemm 功能
下页继续
2 新增特性及变更 沐曦股份专有信息 RN‑23009‑020‑F5 | 3
MXMACA‑C500 发布说明
表 2.3 – 续上页
模块 特性说明
mcTlassEx 新增 int8 w4a8 fused moe gemm 功能
支持 mcTile 跑通官方 vector add、gemm 和 MHA examples
mcTlassEx 新增 int8 w8a8 masked fused moe 功能
mcTlassEx 增加 bf16 fused moe 接口功能
flashMLA 支持 decode context parallel
flashAttn 支持用于搜广推训练场景的 HSTU attention
Perf Tool 增加 CycleTrace Memory Latency 统计，包括最大值和平均值统
计
Diagease mx‑diagease 增加 PCIe Atomic 测试功能
Install 本地离线安装 MXMACA SDK 时检测服务器上是否已安装其他版
本的 SDK，如已安装，会给出提示
2.4 Metax‑Driver‑3.5.3.11，MXMACA‑SDK‑3.5.3.18，MXMACA‑
Pytorch‑3.5.3.9，MXMACA‑Iree‑3.5.3.0，MXMACA‑JAX‑
3.5.3.0
模块 特性说明
Metax Driver KMD 麒麟 KylinOS V11 内核适配
联通 CULinux V3.0 和 CUOS V4.0 内核适配
XCORE 上报 FWE error 时,KMD 支持打印 L2C 信息
SMI mx‑smi 支持在指定的 maca 目录获取 MACA Version
MXMACA SDK UMD 支持为 VPU 配置专用 Signal Pool, 使其可寻址的虚拟地址空间
(VA) 严格约束在 32 位范围内 (即 <=4GB)
支持 MCCL 通信流对硬件队列的独占机制 (Best Effort)
mcMemset 小 shape 性能提升到 C500 理论目标值 (4Bytes 从
10us 优化到 5us 以内)
D2D 小 shape 拷贝 APl 性能提升到 C500 理论目标值 (4MB 从
24us 优化到 10us 以内)
支持任意数量 GPU 动态锁定/解锁同一主机内存，实现在该主机
内存进行多卡 H2D 传输
支持多 Stream SDK Trace 能力，用于观测和诊断上层业务与底
层硬件队列间的排队问题
Compiler 修复了编译器版本升级带来的功能和性能回退问题
下页继续
2 新增特性及变更 沐曦股份专有信息 RN‑23009‑020‑F5 | 4
MXMACA‑C500 发布说明
表 2.4 – 续上页
模块 特性说明
编译器支持 -offload-arch=native 功能
支持 jax for alphafold3 在 jit 模式下运行
CommLib 支持博通网卡 IBGDA 特性
MCCL、MCFILE 支持日志落盘功能
C588 适配支持 DeepEP
C588 TP16 allreduce 性能提升 20%
ACL 修复 Blas 库在 CentOS7 上的功能问题
flashlnfer 支持Trtllm_batch_decode_with_kv_cache_mla
接口的功能
Blas 库 Gemm 针对 k 为奇数场景的性能优化
flashAttn 优化了 headdim96 和 512 的算子性能以支持客户 dit、
vae、clip encoder 等模型的性能
Tools mcProfiler 支持多卡多进程
mcTracer nvtx payload 显示功能开发
mcProfiler 适配 CentOS7
mcProfiler 支持单卡多进程
MXMACA PyTorch ACL pytorch reduce 算子 global memory 初始化优化
2.5 Metax‑Driver‑3.3.0.4，MXMACA‑SDK‑3.3.0.15，MXMACA‑
Pytorch‑3.3.0.2，MXMACA‑Iree‑3.3.0.0，MXMACA‑JAX‑
3.3.0.0
模块 特性说明
Metax Driver SMI mx‑smi 温度、board sn、chip name 相关优化
mx‑smi 优化 mmio 空间不够时的错误提示
mx‑smi 优化 VBIOS 文件不存在时的错误提示
MXMACA SDK UMD 延迟系统内存初始化时机，以解决 PyTorch 等框架初始化时占用
系统内存过多的问题
单机多卡环境下，支持任意数量 GPU 动态锁定/解锁同一主机内
存，实现多卡 H2D 传输
优化 MACA_GRAPH_LAUNCH_MODE=3 的 Stream 优先级， 即保证
Graph 额外创建的 Stream 和 Graph Launch API 使用的 Stream
优先级一致
下页继续
2 新增特性及变更 沐曦股份专有信息 RN‑23009‑020‑F5 | 5
MXMACA‑C500 发布说明
表 2.5 – 续上页
模块 特性说明
为 Kernel Timeout 精准定位功能添加具体原因
CommLib 适配 MIXL 库，支持基本功能
DeepEP 适配 Hidden Size 和专家数等更多参数规格，以支持更
多 MoE 大模型
分层算法支持多机 Reduce Scatter、All Gather 通信功能
ACL Xformers 将 attention backend 所 用 的 flashAttn2.5.3 升 级 到
2.6.3，并支持全部 memory efficient forward API 功能
mctlassEx 新增 w8a16 contiguous group gemm 接口功能
mcDNN 新增 int8/fp16 fwd conv+gelu 融合功能
FlashMLA 支持 deepseek v3.2 所需的 sparse prefill 和 decode
功能
Tools mcProfiler 增加轮次对比功能
在单机多 device 场景，CycleTrace 支持多卡同时执行
MXMACA PyTorch ACL 支持 torchcodec‑0.6.0
发布 PyTorch2.8 版本，同时移除 PyTorch2.1 版本
MXMACA JAX JAX 正式发布 mcJax‑0.4.34 AI 训推框架
2.6 Metax‑Driver‑3.2.1.12，MXMACA‑SDK‑3.2.1.10，MXMACA‑
Pytorch‑3.2.1.3，MXMACA‑Iree‑3.2.1.0
模块 特性说明
Metax
Driver
SMI mx-smi 命令新增板卡级别的信息显示
SMI eeprom 支持显示 Board Type
MXMACA
SDK
UMD 支 持 mcTracer / torch profiling 采 集 新 增 的 API 接 口
类 型 数 据 (mcExtBatchCopyFlagAndWait, mcStreamWrite‑
Value32/64, mcStreamWaitValue32/64)
支持应用 Graph 的拓扑感知和优化，自动删除 DAG 冗余的节点
依赖
Compiler Fortran OpenACC 编译器编译时间优化及 WRF/CL T 工程问题修
复
ACL FlashInfer 升级版本到 0.2.6 并保证 API 兼容性
FlashAttn 支持 GPT‑OSS 推理所需 sink 功能
mcBlas 库 allgather+gemm 融合算子支持 bias 融合
下页继续
2 新增特性及变更 沐曦股份专有信息 RN‑23009‑020‑F5 | 6
MXMACA‑C500 发布说明
表 2.6 – 续上页
模块 特性说明
mcBlas 库修复了部分 gemm kernel 在极端情况下偏移计算错误
的问题
mcsolver hegvd 性能优化，针对典型应用达到性能预期
MXMACA Py‑
Torch
ACL catOp 支持 uint64
2.7 Metax‑C500‑Driver‑3.1.0.11，MXMACA‑C500‑SDK‑3.1.0.14，
MXMACA‑C500‑Pytorch‑3.1.0.4，MXMACA‑C500‑Iree‑
3.1.0.0
模块 特性说明
Metax
Driver
Firmware Firmware 支持严重错误的掉电非易失记录功能
XCORE RAS Monitor 由 fw 代理读取 MCA 信息
SMI 虚拟化 warm reset，mx‑smi 二次确认增加命令行选项
mx‑smi 支持显示 PCIe 事件详细信息
mx‑smi 支持显示 PCI MMIO 状态， 当状态异常时显示第一次发生
异常的时间
增加 sGPU 调度延时查询接口
MXMACA
SDK
UMD 支持 stream 占用的 CE 队列个数按优先级可配置且均匀划分到不
同 pipe，提高同级任务在不同 pipe 间的负载均衡
GraphhostNode 的调度采用 sDMA 队列，替代原先的 CE 队列方
案，以降低对 kernelNode 服务所用 CE 队列资源的占用
在 Graph 多流共享同一 CE 队列的场景下，支持跨流任务依赖关
系检查，并依据依赖关系正确调度任务下发，有效防止任务阻塞
MCCL N260 通信性能提升。对于小于 1MB 的通信数据上，4 卡通信性
能提升 60%~200%，8 卡通信性能提升 40%~130%
Compiler 编译器适配 gcc13 版本（Ubuntu24.04 的默认版本）
支持 device segmented topk，提供高性能 seg‑topk 方法
Fortran OpenACC 编译器支持 CL T 项目工程中新增需求特性
SW_ACL mctlassEx int8 dequant gemm 相关 Python 接口初版发布
mctlassEx int8 dequant gemm 相关 C 接口初版发布
mcTlass 新增 Int8 MaskedGroupGemm 接口功能支持
修复了 mcBlasLt 内存泄漏的问题
下页继续
2 新增特性及变更 沐曦股份专有信息 RN‑23009‑020‑F5 | 7
MXMACA‑C500 发布说明
表 2.7 – 续上页
模块 特性说明
flashInfer 优化了 DeepSeek 推理场景下 normal prefill 的性能
优化了 mcBlas/mcBlasLt workspace 处理机制
flashAttn 优化了客户使用场景下 headdim 32、 64 和 256 的性能
MXVS mxvs 和 mxdiagease 带宽测试增加校验功能
MXMACA Py‑
Torch
ACL PyTorch2.4/2.6 增加 Py3.12 发布
spconv 针对典型应用的性能优化
2.8 Metax‑C500‑Driver‑3.0.0.5，MXMACA‑C500‑SDK‑3.0.0.8，
MXMACA‑C500‑Pytorch‑3.0.0.3，MXMACA‑C500‑Iree‑
3.0.0.0
模块 特性说明
Metax
Driver
Firmware 增加 Power Persistent Mode
优化 MetaXLink training 失败时的提示信息，便于现场排查故障
KMD Linux 内核主线 6.13 版本适配
KMD 安装时支持模式指定设备文件权限为 root:root 0666
支持可靠的单卡场景下 unbind 设备功能
Unload driver 期间禁止新任务使用 mxcd 设备以保证驱动卸载
功能正常
KMD 代码在异常情况时打印返回值优化
SMI 增加单个 sGPU 调度策略信息的显示
MXMACA
SDK
UMD mcTracer 工具支持 trace 区间可控
MXMACA SDK 支持运维工具在程序运行过程中开启 RPC 并 at‑
tach 进来抓取 MCPTI 数据
mcGraph 支持在 mcStreamCapture 期间手动添加除 host 节点
之外的其它类型节点
优化 mcMemcpyAsync 小 size 对齐场景的性能， KV Cache 64KB
大小的 D2D 内存拷贝从 24us 分别优化到 graph 外 10us 和 graph
内 7us
trap 工具功能增强，新增支持核函数参数为多维指针结构体类型
sGPU 场景适配功能增强，硬件 queue 受限场景自动切换到 CPU
做同步，避免一些潜在的 Hang 场景
下页继续
2 新增特性及变更 沐曦股份专有信息 RN‑23009‑020‑F5 | 8
MXMACA‑C500 发布说明
表 2.8 – 续上页
模块 特性说明
UMD 动态库头文件 C++ 符号发布改进， 增加可替代的 C 接口， 并
在 C++ 接口增加废弃告警，提示用户尽快切换到相应的 C 接口
MCCL Full Connection 算法支持 2 卡通信
MCCL 支持每个 rank 独立设置不同的 VISIBLE DEVICES
MCCL 分层算法支持 MACA Graph
优化 internode 算法性能并达到理论值
优化 internode LL 算法性能并达到理论值
Compiler 编译器适配 gcc13 版本（Ubuntu24.04 的默认版本）
SW_ACL mcEigen 库从 MXMACA SDK 包中移除
mcTlass 新增 Int8 MaskedGroupGemm 接口功能支持
mamba 初版功能发布
发布 Sage Attention2.1 算子库以支持 Wan 等模型推理加速
FlashInfer 优 化 了 DeepSeek 推 理 所 需 MLA decode 性 能， 在
EP128 的 batch32 下性能大幅提升
mcBlasL T 库 Gemm 与通信融合针对 llama/Qwen 系列重点大模
型训练的性能优化
mcBlas 库 fp16/bf16 gemm 针对大 MNK 情景下的性能优化
mcBlas 库针对 Deepseek/Qwen3 等大模型推理的性能优化
mcTlass int8 fused gemm 针对 deepseek 性能优化
mcTlass int8 fused moe 扩展了输入参数的支持
MXMACA Py‑
Torch
ACL PyTorch tf32 gemm/conv 行为修改
torch 使用 flash_attn 库 C API 接入相关功能
2.9 Metax‑C500‑Driver‑2.33.0.9，MXMACA‑C500‑SDK‑
2.33.0.12，MXMACA‑C500‑Pytorch‑2.33.0.5，MXMACA‑
C500‑Iree‑2.33.0.0
模块 特性说明
Metax
Driver
Firmware eeprom 中存储 VBIOS 升级记录
KMD 提供 KMD 错误代码，并打印到日志
KMD 提供 ECC errors 的统计和显示
支持使用只读方式打开文件，进行 Host2Device 拷贝操作
下页继续
2 新增特性及变更 沐曦股份专有信息 RN‑23009‑020‑F5 | 9
MXMACA‑C500 发布说明
表 2.9 – 续上页
模块 特性说明
提供 sGPU 模式的 -l 参数功能， 显示一台服务器上所有 sGPU 实
例
提供对 sGPU 调度队列的优先级设置，增加运维调度的可配置灵
活性
SMI 提供 ECC errors 的统计和显示
SMI 拓扑显示支持国产网卡
SMI 升级 Firmware 前，增加检查服务器 MMIO 地址空间的逻辑，
避免识别不到卡无法恢复的问题
整合芯片和板卡 SN 号，显存型号和大小的信息显示
MXMACA
SDK
mxExporter mx‑exporter 上报 EID，ECC error 指标
mx‑exporter 上报 MetaXLink AER，收发总字节指标
UMD MCPTI 支持 NVTV_FUNC_WITH_PARAMS_API
MCPTI 支持 Graph 实例化后再开启 Pytorch Profiling
MCPTI 支持 single‑block 方式配置 perfcounter
当 GPU 资 源 不 满 足 用 户 配 置 的
MACA_PRIORITY_QUEUE_POLICY 时， 支 持 自 动 根 据 可 用
硬件 Queue 数目修改 Queue 的优先级配置
调试功能增强：支持通过配置文件设置 kernel 名字，使得该
kernel 所在 rodata 为 readonly，便于调试内存踩踏问题
提供 UMD 错误代码，并打印到日志
MCCL OAM 机型默认开启 PCIe 链路通信，通信性能提升 10%‑20%
通信库支持 DeepEP64 通信
TransferBench 增加 RDMA 链路检测功能，用于检测集群网络可
用性
计算通信并行， AllReduce/ReduceScatter 算法支持分片传输， 性
能提升 20%
Compiler Fortran OpenACC 编译器支持 WRF 项目工程中新增需求特性
memcpy_async 应用接口实现
通过 auto predicate optimization 提升 vllm page atten BF16 性
能
ACL mctlass 新增 int8 batched gemm 基础功能支持
mctlass 新增 int8 fused moe 接口功能支持
mctlass int8 gemm 性能优化
BLAS groupgemm 性能优化
下页继续
2 新增特性及变更 沐曦股份专有信息 RN‑23009‑020‑F5 | 10
MXMACA‑C500 发布说明
表 2.9 – 续上页
模块 特性说明
FlashInfer 优化 deepseek 的 MLA 算法在 EP128 切分下的性能到
70%
flashMLA 优化了 deepseek 推理所需 shape 的性能
MXMACA Py‑
Torch
ACL PyTorch2.1/2.4 扩展支持 sdma 类型通信 op
torch 使用 flash_attn 库 C API 接入相关功能
IREE 新增 IREE 软件包， 谷歌开源的机器学习推理框架， 专为高效部署
机器学习模型而设计的端到端编译器与运行时工具链
2.10 Metax‑C500‑Driver‑2.32.0.6，MXMACA‑C500‑SDK‑
2.32.0.6，MXMACA‑C500‑Pytorch‑2.32.0.3
模块 特性说明
KMD KMD 适配 mlx 网卡 doorbell 映射到 gpu mem 的功能
支持 dragonfly 拓扑基础上使能 MetaXLink port5 的新拓扑
支持 GPU 使用 Linux hugetlb 大页或者连续小页组成的适合合并
PTE 的 2M 页面
支持当前 HW queue 状态查询
UMD MXMACA Graph 支持选择内存相关节点使用 Blit Kernel 或 SDMA
Kernel hang 住时获取所有 ringbuffer MqlPacket 等信息
mcpti 支持 single‑block 方式配置 perfcounter
UMD 自适应 sGPU 默认开启 MPS
支持 trapHandler 非致命异常 command 级别精准定位
UMD 提供 API 以供查询 stream 复用 queue 的情况
UMD 在 Graph IB 模式下移除单 stream 上最多使用 512 个 active
signal 的限制
支持环境变量设置进程创建 stream 最大等待时长，避免进程
hang
MCCL UMD 适配 mellanox 网卡 doorbell 地址映射接口
实现通信库 alltoallV extend 功能
开发 32 卡通信 Ring 算法及性能调优
实现通信库 allreduce extend 功能
Compiler Fortran OpenACC 编译器支持 CL T /WRF 项目工程中新增需求特
性
下页继续
2 新增特性及变更 沐曦股份专有信息 RN‑23009‑020‑F5 | 11
MXMACA‑C500 发布说明
表 2.10 – 续上页
模块 特性说明
通过 double buffer pingpong 方案提高 gemv 性能
ACL FlashAttention flashAttn 支持某客户推理所需特殊 alibi 并优化性能
flashInfer 优化 deepseek 推理所需 MLA kernel 的性能
mcBlas BLAS Customer Kernel Selection 工具支持 LLM Infer gemm 性
能优化
支持 FP32 group gemm 功能
mcDNN mcDNN 针对 mmpre/mmdet 网络性能优化
mcSolver mcSolver geqrf 性能优化
mcTlass mcTlass 增加 FP32/FP16/BF16 group gemm 功能支持
在 MXMACA 平台上支持 deepseek 的 flashMLA 并开源至 github
PyTorch 发布 PyTorch 2.6
Tools 记录 GPU 变不可用的原因并提供 sysfs 接口
mx‑smi sgpu 实现一次性创建需要的 sGPU 个数
mx‑report 新增 lspci ‑vvxxxx 信息收集
SMI 增加 nvml.h 头文件中相关结构体和函数，方便编译通过
mxvs 算力支持 sGPU
mx‑exporter 支持 sgpu‑wheel
2.11 Metax‑C500‑Driver‑2.31.0.6，MXMACA‑C500‑SDK‑
2.31.0.6，MXMACA‑C500‑Pytorch‑2.31.0.4
模块 特性说明
MXMACA 软件栈 从 2.31.0 版本开始，正式全面支持在线安装相关功能，详情请参
考https://developer.metax‑tech.com/softnova/index
SDK 安装路径版本号变更为 3 位
KMD/FW 增加对 ccx fw 和 ccx boot（VBIOS）的版本兼容性检测
UMD 支持 GPU 拓扑感知
优化 GraphLaunch 耗时
direct dispatch 模式下支持以下 API：
mcDeviceSetGraphMemAttribute
mcDeviceGraphMemTr
mcDeviceGetGraphMemAttribute
默认开启 kernel 前 L2 flush 的优化
下页继续
2 新增特性及变更 沐曦股份专有信息 RN‑23009‑020‑F5 | 12
MXMACA‑C500 发布说明
表 2.11 – 续上页
模块 特性说明
细化完善 trap kernel 精准定位方案
MCCL 多机 SDMA sendRecv 并行方案开发
集群状态检测脚本开发/优化
添加 RAS 功能
Dragonfly8 卡通信算法优化
开发分层算法， 提升 OAMC550 Switch Box 拓扑 16 卡/64 卡性能
Compiler OpenACC 编译器新增对 WRF 项目工程中涵盖的语义特性支持
新增 OpenACC 编译器运行时依赖 Python 包列表显示的选项支
持
用 table lookup 算法优化 vLLM kDequantize 性能
ACL FlashAttention 在 FlashAttention 中添加 headdim 512
flashAttn 提供 kernel selector 插件以针对特定 shape 选择性能
更好的 kernel
flashAttn 提供 kv cache int8 反量化功能以支持 decoder 阶段提
升性能
flashInfer 升级版本到 0.2.x 版本以支持 deepseekV3 推理
用 fast div 方案优化 flash attn2 性能
通过 B16 寄存器分配提高 flash attn2 性能
新增 w8a8 azp 功能
mcBlasL T 支持 GEMM+Commincation API
优化 gemm+bias API 的性能
mcBlas 优化 gemv 性能
优化大模型推理（包括 deepseek r1）的性能
mcDNN 优化 mcDNN FP32/TF32 单向 LSTM 性能
mcFFT 优化 8192 范围内素数 size 的性能，从 30% 提升到 60%
用 metaxgpu slp 方案优化 triton‑flash attention2 bwd 的性能
TF32&Int8 GEMM 性能有提升
优化 deepseek mla triton 算子性能
优化 deepseek fused moe triton 算子性能
优化 PyTorch cat 算子性能
Tools mcTracer mcTracer 工具支持 profiling 区间可配置
mxvs 工具打流支持 switch 地址遍历
2 新增特性及变更 沐曦股份专有信息 RN‑23009‑020‑F5 | 13
MXMACA‑C500 发布说明
2.12 Metax‑C500‑Driver‑2.29.0.13，MXMACA‑C500‑SDK‑
2.29.0.19，MXMACA‑C500‑Pytorch‑2.29.0.4
模块 特性说明
MXMACA 软件栈 支 持 基 于 APT /YUM 的 MXMACA SDK 和 Driver 在 线 安 装 与
卸 载 的 基 本 功 能， 以 及 PIP 方 式 的 Pytorch 在 线 安 装 功 能，
详情请参考 https://repos.metax‑tech.com/gitea/repos/index/
wiki/MACA.md
Compiler Fortran OpenACC 编译器中支持了 Reduction 分离特性
新增 mlir‑translate 编译器组件工具，支持 mlir 文件到 llvm ir 文
件的转换
PyTorch 发布 mcPytorch 2.4 版本
mcAudio 发布 2.4 版本，功能支持 95%
ACL mcTriton mcTriton 发布 3.0 版本
改 进 Post‑RA 调 度 策 略， 消 除 了 非 必 要 snop，Triton 的 TN
pipeline 性能提升 5%
mcspconv 发布 mcspconv 库初版
mcBLAS mcBLAS 库优化了部分大模型推理场景下的性能
flashAttn flashAttn 库优化了部分大模型推理场景下 paged attention 的性
能
mcTlass mcTlass 优化 int8 TN GEMM 在 vllm w8a8 应用场景下的性能
MCCL MCCL 优化 C500/C550 AllToAll 通信，整体性能平均提升 20%
MCCL 优化 C500/C550 低时延算法，小数据量通信时延平均降低
30%
MCCL 优化 C500X Switch 跨机 EP4/EP8 通信性能，整体性能平
均提升 200%
MCCL 支持异构集群
UMD Direct Dispatch 的 command 状态更新，提升部分场景的性能
github 上选取有意义的第三方开源项目，通过率达到 3453/3838
= 90%
AI MXMACA Graph 的并行节点最大限度分散到不同硬件 queue， 提
升部分场景的性能
升级 flashAttn 库版本到 2.6.3， 增加了 softcap、 small page size
推理等功能的支持
Tools mcTracer/mcpti 的 tracing 数据准确性提升，改进 mcMemcpy
在大 size 拷贝时耗时统计的精确性
下页继续
2 新增特性及变更 沐曦股份专有信息 RN‑23009‑020‑F5 | 14
MXMACA‑C500 发布说明
表 2.12 – 续上页
模块 特性说明
mcTracer/mcpti 增加后台非实时线程处理 app 线程的 tracing
数据，降低 app 线程进行 tracing 的 overhead （在某多进程多卡
场景的 profiling 时间从 75s 减少到 15s）
2.13 Metax‑C500‑Driver‑2.27.0.11，MXMACA‑C500‑SDK‑
2.27.0.11，MXMACA‑C500‑Pytorch‑2.27.0.8
模块 特性说明
MXMACA 软件栈 支持天固 Gen5/超聚变/单机 Dragonfly 16 卡服务器
mcTracer 支持单机多进程多卡场景，支持 Call Stack 显示
Compiler 支持 OpenCL v1.2 Spec 中的所有 built‑in function
支持 OpenCL 编译器 mxcc‑ocl
使能了 OpenACC 编译中的 collapse 子句
发布了 MXMACA Clangd 语言编程工具
在 MI 调度阶段引入了 Igroup 功能模块，为 MMA 相关的代码段
引入了用户可配置的调度策略，提高了指令调度的效率
提升 mcRTC 兼容性，大幅降低用户对 jitify 的相关代码进行修改
适配
SOMA 兼容虚拟地址的管理行为，减少部分场景潜在的显存碎片
化问题
优化了 MI 调度模块，使得 Triton MMA 的 utilization 从 60% 提
升到 73%
优化了 Uniform branch 处理方法，提升了 mcTlass GEMM i8 性
能 5%~20%
优化了 pk_fma 处理策略，提升 vllm gptq kernel 性能约 20%
优化了 BF16 cvt 和 compute 的处理，提升了 BF16 hgemm_nt
的性能约 25%，达到 FP16 hgemm_nt 的 85%
提升了 OpenACC 的性能，使得 VASP Benchmark 的性能有提高
KMD VBIOS 增加对 RAVS 电压补偿方案、 光模块热插拔功能、 SDMA 对 tracer
timestamp 的支持
完善 CE 对 direct_dispatch 模式的支持
UMD MCCL 支持 Dragonfly 32 卡拓扑，支持博通/云合等网卡交换机
Graph 提升 Graph IB 模式性能，并且默认开启 Graph IB 模式，提升 AI
推理场景性能
下页继续
2 新增特性及变更 沐曦股份专有信息 RN‑23009‑020‑F5 | 15
MXMACA‑C500 发布说明
表 2.13 – 续上页
模块 特性说明
提升单卡部分 size D2D memcpy 性能（4MB‑64MB 提升约 30%）
提 升 单 节 点 多 卡 环 境 DMA queue 的 吞 吐 量， 大 幅 提 升 DMA
queue 满负荷使用场景的性能
VPU mxJPEG VPUD/VPUE 支持 stream 操作，VPUD 支持 batch 功能。
ACL mcBLAS mcBlasLt 库支持了 GEMM 的 out of place 功能
mcBlas 库修复了 kernel selection 工具在不同 Python 版本下的
兼容问题
mcBlas 库支持了 deterministic mode
BF16 GEMM 性能表现提升至与 FP16 GEMM 一致水平
优化了 group GEMM API 在 MOE 模型训练场景下的性能
优化了 BF16/FP16 GEMM 在 problem size 非对齐场景下的性能
优化了 BF16/FP16 在 new fused config 2M page size 下的性能
mcDNN 支持了 BF16 fwd conv 融合，LSTM 新增支持 dropout
BF16 fwd conv 性能表现提升至与 FP16 fwd conv 一致水平
mcTlass 支持了 BF16 group GEMM 功能， 和 INT8 GEMM 下 ScaleBias 类
型融合的功能
FlashAttn 增加 DeepSeek v2 的 MLA 功能支持，并优化了性能
优化了 head dim 为 32 奇数倍的推理算子性能
FlashInfer 发布 0.1.5 完整功能版本，支持 prefill、decoder 和 cascade 等
推理需求
mcFFT 优化了 127 以内素数基的性能
优化了小 size 2D 和 3D real transform 算子性能
mcImage mcImage 性能提升 50%‑10 倍
mcMathLib 15 个常用接口性能提升 10% 以上
PyTorch mcPytorch 增加了 ProcessGroup 的 mpi 后端支持
移除 kernel 中关于 assert 的使用，提升了相关 kernel 的性能
优化部分非连续输入输出场景下 cat/reduce 算子性能
2 新增特性及变更 沐曦股份专有信息 RN‑23009‑020‑F5 | 16
MXMACA‑C500 发布说明
2.14 Metax‑C500‑Driver‑2.25.2.8，MXMACA‑C500‑SDK‑
2.25.2.9，MXMACA‑C500‑Pytorch‑2.25.2.8
模块 特性说明
UMD Runtime API 新增 API mcLaunchKernelExC， 通过扩展属性配置 Cooperative‑
Group 指定核函数的内存同步域，这对于跨设备的内存同步和异
步执行非常有用。
mcpti activity 质量增强
VPU 优化 VPUD 264 sps/pps
AI 大模型在 OAM 机型上的通信算子性能符合理论值
triton 提升 fp16 MMA on triton 性能，峰值性能达到标成算力的 65%
优化冗余的跨基本块的 fp16 数据合并操作，提升 10% 的 triton
MMA 场景性能
ACL Flash Attention 优化了 headdim96 的前向和反向功能
优化了 headdim256 的 decode 功能
mcBlas 针对大模型推理相关模型进行了性能提升
tools inspector 发布集群环境检测工具 inspector
mcProfiler 优化 mcProfiler UX
mx‑report 提供 mx‑report 工具试用版
2.15 Metax‑C500‑Driver‑2.25.0.3，MXMACA‑C500‑SDK‑
2.25.0.7，MXMACA‑C500‑Pytorch‑2.25.0.0
模块 特性说明
MXMACA 本版本旨在快速提供 MXMACA 软件栈在 MOE （混合专家模型） 技
术上的最新支持成果，后续版本仍会持续优化
mcpti 新增 Graph API IB 模式的 tracer 功能支持
mcBLAS 增加了 Group GEMM 相关 API 的支持
针对大模型推理相关模型进行了性能提升
加强使用 Graph API 测试场景覆盖
Compiler 使能 OpenAcc P0 特性和 OpenCL 基本特性
优化 pkfma 和 FP16 cvt 执行策略， 提升 vLLM 关键 Kernel GPTQ
性能
下页继续
2 新增特性及变更 沐曦股份专有信息 RN‑23009‑020‑F5 | 17
MXMACA‑C500 发布说明
表 2.15 – 续上页
模块 特性说明
优化冗余的跨基本块的 FP16 数据合并操作，提升 triton MMA 场
景性能
加强 Direct Dispatch 的测试场景覆盖
加强显存使用复杂场景的测试场景覆盖
FlashAttention 优化了 headdim96 的前向和反向功能、head‑
dim256 的 decode 性能
提升 FP16 MMA on triton 性能
2.16 Metax‑C500‑Driver‑2.24.0.10，MXMACA‑C500‑SDK‑
2.24.0.12，MXMACA‑C500‑Pytorch‑2.24.0.5
模块 特性说明
UMD 提供 DirectDispatch 功能
加强了多进程支持的稳定性，并有小幅性能提升
MCCL 支持易构集群
C500X Ring 算法支持网卡和 PCIe 并行通信，分布算法性能优化，TP8
带宽性能提升
ARM 支持复用 PCIe 链路通信，单机多卡通信带宽性能提升
Graph API 支持 Memory Node 基本功能
ACL mcTracer 支持根据 UMD memory tracing log 单独生成 trace 文件，并可
以通过 mcTracer‑Viewer 打开并显示
mcDNN 增加了 FP16 前向 depthwise 卷积融合功能
mcDNN/
mcBLAS
增加外置 kernel 选择优化工具
Flash Attention 增加 MHA/GQA backward 全部 headdim 的支持
增加对 decoder attention 和 paged attention 全部 headdim 的
支持
支持更通用的 attention mask
Compiler 增加 global load/store builtin function with predicator
ARM 修复了一些 ARM 平台上的软件适配问题
2 新增特性及变更 沐曦股份专有信息 RN‑23009‑020‑F5 | 18
MXMACA‑C500 发布说明
2.17 Metax‑C500‑Driver‑2.23.0.1014，MXMACA‑C500‑SDK‑
2.23.0.1018，MXMACA‑C500‑Pytorch‑2.23.0.1011，
MXMACA‑C500‑K8s‑0.7.13
模块 特性说明
C500X MetaXLink 支持隐式 MetaXLink training
MCCL 支持 C500X
ACL mcDNN 提升 FP16 depth‑wise 卷积性能
mcBLAS 提升大语言模型场景下的矩阵乘法性能
Flash Attention 提升 head dimension 部分性能
PyTorch 新增支持 python 3.10
新增支持 torch2.1
Compiler 新增编译选项‑mllvm ‑metaxgpu‑lduB16=true
Triton 支持 triton2.1
mcTracer 支持根据热点 API slice 排序
Bug 修复 修复了 200+ reported bug，包括 5+ hot issue
2.18 MXMACA‑C500‑2.22.0.9 amd64 和 MXMACA‑C500‑
2.22.0.11 arm64
模块 特性说明
OS 适配 本 次 发 布 新 增 OS BCLinux R8 U2，kernel 4.19.0‑
240.23.11.el8_2.bclinux.x86_64
支 持 飞 腾 5000C ARM 系 统，kernel 5.15.0‑
1.10.6.v2307.ky10h.aarch64
驱动 Warm Reset 支持 Warm Reset 方式
ACL 发布 mcApex 和 mcXformer
Bug 修复 修复了 100+ reported bug，包括 1 hot issue
2 新增特性及变更 沐曦股份专有信息 RN‑23009‑020‑F5 | 19
MXMACA‑C500 发布说明
2.19 MXMACA‑C500‑2.20.2.19
模块 特性说明
OS 适配 本次发布新增 OS ALinux3，kernel 5.10.134‑13.1.al8.x86_64
本 次 发 布 新 增 OS CTYun 23.01，kernel 5.10.0‑
136.12.0.86.ctl3.x86_64
本 次 发 布 新 增 OS x86_64 Kylin V10 SP2，kernel 5.10.0‑
136.12.0.86.ctl3.x86_64
本 次 发 布 新 增 OS KeyarchOS 5.8，kernel 4.19.91‑
27.4.19.kos5.x86_64
驱动 VPU 新增支持多进程 FFmpeg 编解码
Bug 修复 修复了 200+ reported bug，包括 1 hot issue
2.20 MXMACA‑C500‑2.19.2.23
模块 特性说明
Bug 修复 修复了 220+ reported bug，包括 19 hot issue
2.21 MXMACA‑C500‑2.19.2.7
模块 特性说明
Bug 修复 修复了 160+ reported bug，包括 13 hot issue
2.22 MXMACA‑C500‑2.19.0.12
模块 特性说明
Bug 修复 修复了 160+ reported bug，包括 7 hot issue
2 新增特性及变更 沐曦股份专有信息 RN‑23009‑020‑F5 | 20
MXMACA‑C500 发布说明
2.23 MXMACA‑C500‑2.18.0.4
模块 特性说明
Bug 修复 修复了 reported bug
2.24 MXMACA‑C500‑2.17.3.11
模块 特性说明
驱动 内核态驱动 新增支持 CC Linux 22.09
虚拟化 新增支持虚拟化相关功能
VPU 新增支持 264/265/jpeg 编码， 264/265/av1/avs2/jpeg 解码， 8k
30fps
Bug 修复 修复了 57 reported bug，包括 24 hot issue
2.25 MXMACA‑C500‑2.16.1.11
模块 特性说明
驱动 内核态驱动 新增支持 RedHat 9/CentOS 9 和 BC‑Linux for Euler （21.10 及以
上）
Bug 修复 修复了 120+ reported bug，包括 10+ hot issue
2.26 MXMACA‑C500‑2.15.0.7
模块 特性说明
驱动 固件 支持 C500 芯片上运行的基本固件功能
内核态驱动 支持 C500 芯片上运行的基本内核功能
用户态驱动 支持 C500 芯片上运行的基本用户态驱动功能
编译器 编译器 支持基本 C500 编译器功能
数学库 基本数学库 支持 C500 芯片上运行的基本数学库功能
Pytorch 支持 C500 芯片上运行的 Pytorch 功能
2 新增特性及变更 沐曦股份专有信息 RN‑23009‑020‑F5 | 21
MXMACA‑C500 发布说明
3 版本兼容性
本章列出历次发布的版本兼容性。
3.1 Metax‑Driver‑3.2.1.12，MXMACA‑SDK‑3.2.1.10，MXMACA‑
Pytorch‑3.2.1.3，MXMACA‑Iree‑3.2.1.0
模块 兼容性说明
MXMACA SDK SW_ACL 从 MXMACA SDK 3.2.1 开 始, MCmemGenericAllocaticn‑
Handle 类 型 从 uint64_t 修 订 为 unsigned long long， 仅
在不常用的 32 位操作系统上用到此 API 的文件需要重新编
译
3.2 Metax‑C500‑Driver‑3.0.0.5，MXMACA‑C500‑SDK‑3.0.0.8，
MXMACA‑C500‑Pytorch‑3.0.0.3，MXMACA‑C500‑Iree‑
3.0.0.0
模块 兼容性说明
MXMACA SDK SW_ACL 从 MXMACA SDK 3.0.0.x 发布开始，FlashAttn 删除 Python
API 和 C API 中带有 _inference 字符的非标 API
3.3 Metax‑C500‑Driver‑2.32.0.6，MXMACA‑C500‑SDK‑2.32.0.6，
MXMACA‑C500‑Pytorch‑2.32.0.3
模块 兼容性说明
Metax K8s 由于 2.27.0.x 版本 mxsml 的改动，导致 Metax K8s 0.10.0
及以前的版本无法使用 metax‑driver‑image 2.27 及以后版
本
下页继续
3 版本兼容性 沐曦股份专有信息 RN‑23009‑020‑F5 | 22
MXMACA‑C500 发布说明
表 3.3 – 续上页
模块 兼容性说明
Metax K8S 0.10.1 及之后版本恢复对 metax‑driver‑image
2.27.0.x 及以后版本的支持
3.4 Metax‑C500‑Driver‑2.31.0.6，MXMACA‑C500‑SDK‑2.31.0.6，
MXMACA‑C500‑Pytorch‑2.31.0.4
模块 兼容性说明
mcPytorch2.4 x86 上不支持 Ubuntu18
cpp‑extension 应用场景编译时需要：
• x86 上使用 gcc9.x+ 版本
• aarch64 上使用 gcc7.x 版本
3 版本兼容性 沐曦股份专有信息 RN‑23009‑020‑F5 | 23
MXMACA‑C500 发布说明
4 已知问题和使用限制
模块 问题和限制说明
MXMACA 软件栈 多程序长时间并行执行，有概率会出现程序执行无响应问题
Flash Attention C++ 接口有优化，使用 Flash Attention C++ 接口的应用需
要继承新的接口，对 2.23.0.x 及以前版本不兼容
某些主板不支持 atomic 访问的部分功能
mx C/C++ 程序不支持在 Ubuntu18.04 系统编译运行
C550 OAM 上部分算子需要设置 MCCL_PCIE_BUFFER_MODE=1 规避性能
回退问题
特定 case 在 ARM 会遇到长时间执行无法结束的问题
flash_attn 特殊场景下有 hang 的现象
UMD Perf Metrics kernel launch 某些 case 会有一定性能下降
mcFftXt 接口暂未支持，请使用非 Xt 的接口替代
Ubuntu24.04 使用 GCC 13 版本对某些测试有一定兼容性问题
TORCH_ALLOW_TF32_CUBLAS_OVERRIDE 变量在 host 和容器里默认值不
同，个别算子在不同环境测试会出现精度/性能差异
在一些特殊场景下可以设置 MACA_SMALL_PAGESIZE_ENABLE=1 提升性
能
Geqrf 某些 case 会有一定性能下降
Series.str.like 函数在处理某些特殊字符串（如%_ 等）时会失败
C588 平台进行 AI 测试需配置 sudo 命令 sudo cpupower idle-set -D
0 用来提升性能
使用 SGLang 出现问题时可尝试添加 MCCL_ENABLE_FC=0
triton 个别 case 性能有小幅下降
在线安装 Metax Driver 3.7.1.1 时，需要预先在线安装 metax‑linux=3.8.1
模型推理和训练 在 开 启 mxmaca graph 的 时 候 抓 取 torch profile 会 造 成 系 统 异
常， 需 要 配 置 如 下 环 境 变 量 规 避 该 问 题： MCPTI_ENABLED=ON 和
MACA_GRAPH_LAUNCH_MODE=1
Pytorch 训练 centernet_R18 和 Retinanet 模型时，存在 amp 精度 loss 为
NaN 的情况
Pytorch 训练多 VF 场景下偶发 hang
Pytorch 训练学习率策略，推荐使用 --auto-scale-lr 自适应学习率
下页继续
4 已知问题和使用限制 沐曦股份专有信息 RN‑23009‑020‑F5 | 24
MXMACA‑C500 发布说明
表 4.1 – 续上页
模块 问题和限制说明
GPU 占用率低时受到其他硬件因素影响较大，在不同机器测试时易出现性
能波动
Pytorch 个别模型对 CPU 资源敏感易出现性能波动现象
Pytorch ssd 模型多卡训练偶发 loss 为 NaN
Pytorch ARM 环境下执行某些模型时，性能有一定概率出现一定波动
Pytorch Deeplabv3 模型 FP32 精度单卡训练时，需要设置新的环境变量以
避免 loss 为 NaN
对于 LLM.PPL，不建议开启 ACS，因为开启 ACS 可能会导致性能下降。如
果必须开启 ACS，需要关闭通信库 PCIe 复用功能，环境变量是 export
MCCL_PCIE_BUFFER_MODE=0
通讯库性能优化使用了更多显存，特殊情况下，可能导致显存不足
VPU SDK 解码路数过多会有异常
SDK 解码 AVS2 可能会有异常
编码性能可能不达标
MCJPEG 解码暂不支持 444、422、gray、411、440 格式 jpeg 文件
FFmpeg 黑白视频解码可能有花屏
开启虚拟化多于 1VF 情形下，编码相关功能不可用
mx‑smi 个别机型执行 warm reset 会引发异常，count‑ecc 在某些场景抓取不到异
常
MetaXLink MetaXLink 卡间互联后不支持透传单卡到虚拟机中使用， 否则， 可能会发生
不可预期的行为
虚拟化 虚拟机透传 GPU 或 VF，只支持虚拟机启动前设置透传 GPU 或 VF
/etc/mvgvm_config 文件默认权限为 0，如需要修改此文件，需要将文件
权限改为 0644
开启 VF 后做 warm reset 操作，部分服务器会遇到 dmesg 报错提示，实际
操作成功
mx‑report Debian10、 Alinux3、 KeyrachOS5.8 系统使用 mx‑report 时会提示get kmd
log failed ，实际不影响 log 收集
mcTracer 采集多进程任务；采集完毕后会关闭当前终端的回显功能（看不到输入，回
车不换行） ，stty echo 命令能恢复终端状态
mx‑diagease 在 C588 执 行 CPU+GPU 压 测 时， 必 须 配 置 ENV export
MULTI_HOPS_ACCESS_MODE=0 ， 同 时 会 打 印 一 些 预 期 内 的 error 或
fail 信息，不影响测试结果，能正常执行结束
mxvs sGPU 开启后，mxvs ops 在 burst 策略下不符合算力分配原则，fixed 策略
下设置 1‑2% 的算力不符合算力分配原则
下页继续
4 已知问题和使用限制 沐曦股份专有信息 RN‑23009‑020‑F5 | 25
MXMACA‑C500 发布说明
表 4.1 – 续上页
模块 问题和限制说明
sGPU 开启后，burst 模式下，mxvs ops 测试时空闲 sGPU 有利用率 usage
波动
sGPU 开 启 后，sGPU 映 射 到 容 器 后，mxvs 在 容 器 内 运 行 mxvs ops
--detail 时 model 显示 unknown
sGPU 开启后，在 burst 和 fixed 模式下，设置 high 优先级的 sGUP 不符合
high 算力使用原则
C588 mxvs 测试偶现 fp64_vertor 算力值低于标准值 2%‑3%
VF 划 分 VF 时， 有 极 小 概 率 偶 发 出 现 不 影 响 功 能 的 dmesg error 报 错
（PROTOCOL_STATE_RESPONSE_TIMEOUT 2 ） ， 该 报 错 不 影 响 划 分 VF，
功能可以正常使用
4 已知问题和使用限制 沐曦股份专有信息 RN‑23009‑020‑F5 | 26
